Skip to content

Hypothesis tests under separation

Rainey (2023)

DisciplineSocial science
MethodSimulation
Tagshypothesis testinglikelihood ratio testmaximum likelihoodmethod · formal modelingmethod · simulationseparationwald test

Summary

Problem: 分离在政治学中常见,通常发生在二元解释变量完美预测二元结果时。此时,最大似然估计不合理地大,Wald检验产生误导性甚至无意义的p值。方法学家常推荐惩罚最大似然或贝叶斯估计,但研究者难以选择合适的惩罚或先验分布,且结果对先验选择高度敏感。 Approach: 本文通过理论分析和蒙特卡洛模拟,系统比较了Wald检验、似然比检验和得分检验在分离下的表现。作者论证了Wald检验依赖对数似然函数在最大值处的曲率,而分离下该曲率趋于平坦,导致检验失效;似然比检验比较无约束与有约束模型的相对似然,得分检验评估零假设处的梯度,两者不受分离影响。 Finding: 在分离下,Wald检验的势(power)被分离概率严格限制,甚至当真实效应很大时也无法拒绝零假设;而似然比检验和得分检验的势和尺寸(size)表现正常,接近理想水平。相比之下,使用Firth惩罚的Wald检验在零假设下过度拒绝,使用Cauchy惩罚的Wald检验则势不足。 Significance: 本文为面临分离的研究者提供了一种简单、无需先验信息的假设检验方案,避免了惩罚或贝叶斯方法中对先验选择的敏感性争议,使研究者能够用标准频率学派工具可靠地检验核心假设。

Theoretical Framework

  • Theoretical tradition: 频率学派统计推断,具体为最大似然估计框架下的假设检验理论。
  • Prior theories built upon: 最大似然估计理论;Wald检验(Wald 1943);似然比检验(Wilks 1938);得分检验(Rao 1948);分离问题(Albert and Anderson 1984);Firth惩罚估计(Firth 1993);Jeffreys先验;Cauchy先验(Gelman et al. 2008);Zorn(2005)对分离的讨论;Rainey(2016)对先验敏感性的论证;Beiser-McGrath(2022)对Firth惩罚异常性质的说明。
  • Causal mechanism: 分离导致对数似然函数在数值最大值处近乎平坦,使得基于曲率的Wald检验标准误估计过大,从而无法拒绝零假设;而似然比检验依赖无约束与有约束模型的似然差异,得分检验依赖零假设处的梯度,这些特征不受单调对数似然函数的影响,因此检验正常。
  • Key assumptions: 模型为二元逻辑回归;分离为拟完全分离(quasicomplete separation),即单个二元解释变量完美预测结果;零假设为点假设βs = 0;检验统计量在大样本下近似服从相应分布。
  • Theoretical move: 本文挑战了现有方法学建议(即分离时必须使用惩罚或贝叶斯估计),通过证明标准频率学派工具(似然比和得分检验)在分离下有效,扩展了假设检验的适用范围,并补充了现有文献中对Wald检验失效的讨论。
  • Scope conditions: 论证主要针对单个二元解释变量导致的拟完全分离,但作者指出结论可推广到完全分离、线性组合导致的分离,以及其他模型(如有序逻辑回归、Cox比例风险模型)。

Research Design

本文为方法论研究,采用理论论证与蒙特卡洛模拟相结合的方式。模拟中,作者构建了150个多样化的数据生成过程(DGPs),每个DGP设定总观测数(50、100或1000)、s=1的频率(5、10、25、50或100)、常数项βcons(均匀分布-5到0)、控制变量数k(0到6)以及解释变量间相关性ρ(均匀分布0到0.5)。关键自变量为可能分离的二元变量s的系数βs(从-5到5变化),因变量为二元结果y。作者为每个DGP计算三种检验(Wald、似然比、得分)以及两种惩罚估计(Firth、Cauchy)的Wald检验的势函数和尺寸。

Data & Sample

N/A(本文为模拟研究,无实证数据。模拟参数:150个DGP,每个DGP使用2,500次模拟,最坏情况蒙特卡洛标准误为1个百分点。)

Analytical Strategy

作者使用蒙特卡洛模拟计算各检验的势函数(在βs从-5到5变化时拒绝零假设的概率)和尺寸(βs=0时拒绝零假设的概率)。模拟中,每个DGP需满足两个条件:某些βs∈[-5,5]下分离概率至少30%,且至少99.9%的重复样本中结果变量有变异。作者比较了五种检验方法:最大似然下的Wald、似然比、得分检验,以及Firth惩罚和Cauchy惩罚下的Wald检验。结果通过单个DGP的详细展示、150个DGP的汇总图以及按分离概率分层的分析呈现。

Results & Findings

  • Wald检验失效:在分离下,Wald检验的势被1−Pr(separation)严格限制。当真实系数较大(如βs=4或5)时,分离概率高,Wald检验几乎无法拒绝零假设,即使数据强烈支持效应存在。例如,一个完美预测500个成功和500个失败的例子中,精确p值约为2/10^301,但R默认glm()给出的Wald p值为0.998。模拟显示,当分离概率高时,Wald检验的势接近0%。
  • 似然比和得分检验正常:两种检验在βs=0时尺寸约为5%,且随βs远离零迅速接近100%。在分离概率高的情况下,两者仍表现正常,似然比检验略优于得分检验。这证实了理论预期:这些检验依赖的特征不受分离影响。
  • 惩罚估计的问题:使用Cauchy惩罚的Wald检验势不足,尤其在负系数方向;使用Firth惩罚的Wald检验在零假设下过度拒绝(某些DGP下拒绝率超过50%),尺寸严重膨胀。这支持了Rainey(2016)和Beiser-McGrath(2022)对默认惩罚的谨慎态度。
  • 尺寸表现:Wald、似然比和得分检验的尺寸均在合理范围(约2%-10%),但似然比检验在分离概率低时略过度拒绝。惩罚估计的尺寸问题更严重:Cauchy惩罚下尺寸偏低(约2%),Firth惩罚下某些DGP在分离时总是拒绝零假设。

Limitations

作者在脚注中承认,论文主要聚焦于单个二元解释变量导致的拟完全分离,但论证可推广到其他分离形式和其他模型。此外,模拟中使用的DGP虽多样,但特定DGP的选择可能不完全代表所有情况。作者未明确讨论似然比检验在分离概率低时略过度拒绝的问题的实质影响,也未提供针对复杂假设(如多系数联合检验)的详细模拟证据。

Key Contributions

  • 证明在分离下,Wald检验的势被分离概率严格限制,而似然比检验和得分检验表现正常,为研究者提供了无需惩罚或先验的假设检验方案。
  • 通过大规模蒙特卡洛模拟(150个DGP),系统比较了五种检验方法在分离下的势和尺寸,提供了全面的经验证据。
  • 揭示了Firth惩罚和Cauchy惩罚下Wald检验的严重问题(前者过度拒绝、后者势不足),强化了对默认惩罚的谨慎态度。
  • 提供了具体的操作建议(识别分离、使用似然比或得分检验、将惩罚估计作为补充而非替代),为实践者提供了清晰指导。
  • 扩展了分离问题的理论理解,明确了Wald检验失效的机制(依赖对数似然曲率)与似然比、得分检验有效的机制(依赖似然差异和梯度)。

Key Claims

"While the popular Wald test produces misleading (even nonsensical) p-values under separation, I show that likelihood ratio tests and score tests behave in the usual manner." (Abstract)

"Thus, researchers can produce meaningful p-values with standard frequentist tools under separation without the use of penalties or prior information." (Abstract)

"Under separation, the log-likelihood function at the numerical maximum is nearly flat. The flatness produces very large standard error estimates—much larger than the coefficient estimates." (Section 2.1)

"The likelihood ratio and score tests, on the other hand, perform as expected. For both, the power of the test when βs = 0 is about 5%, as designed, and the power approaches 100% relatively quickly as βs moves away from zero." (Section 3.1)

"I view the likelihood ratio and/or score tests as a supplement to (not a replacement for) penalized estimation or Bayesian inference with informative priors." (Section 4)


My Notes